Utilité du projeté de l'erreur de Bellman
On va maintenant s'intéresser aux méthodes SGD permettant de minimiser l'erreur $\overline {PBE}$. Étant de vraies méthodes SGD, ces méthodes convergent de manière robuste, même dans le cas d'un apprentissage hors ligne et avec l'utilisation d'approximations non-linéaires.
L'idée de cette méthode est de développer un objectif lié à l'erreur TD. La méthode du gradient résiduel se basait sur l'erreur de Bellman pour faire cela, mais nous avons vu qu'elle souffre de plusieurs inconvénients, comme le fait qu'elle nécessite un double échantillonnage. Cette fois-ci, l'objectif va être construit en se basant sur le projeté de l'erreur de Bellman.
Notations matricielles
Rappelons pour commencer la vision géométrique de notre problématique, dans un exemple de situation où l'environnement possède par exemple trois états $S = \left( {{s_1},{s_2},{s_3}} \right)$ et le vecteur poids possède deux composantes $\textbf{w} \in \textbf{W} = {\left( {{w_1},{w_2}} \right)^T}$.
Dans cette situation, la fonction de la valeur d'un état $s$ de l'environnement s'exprime de la manière suivante :
avec $\textbf{x}\left( s \right)$ le vecteur caractéristique :
On a donc, pour l'ensemble des états de l'environnement, les trois fonctions des valeurs suivantes:
Les fonctions des valeurs des états de l'ensemble de l'environnement est donc le vecteur :
En définissant la matrice des vecteurs caractéristiques $X$ :
On peut exprimer le vecteur des fonctions des valeurs des états de l'ensemble de l'environnement de la manière suivante:
Le vecteur des fonctions des valeurs des états est donc un vecteur dans $\mathbb{R}{^3}$. Pour une valeur optimale du vecteur poids $\textbf{w}=\textbf{w}^*$, on a les meilleures approximations possibles des valeurs des états :

Rappels sur l'aspect géométrique
L'erreur de Bellman $\overline {{\delta _\textbf{w}}} \left( s \right)$ permet de quantifier l'erreur entre la valeur d'un état obtenue à partir des fonctions d'approximations et les vraies valeurs. L'erreur de Bellman est également l'espérance de l'erreur TD :

On définit plusieurs mesures sur les vecteurs de ces fonctions des valeurs qui sont basées sur l'erreur de Bellman. En particulier, celle qui nous interesse ici est la valeur quadratique du projeté de l'erreur de Bellman:

Expression du projecteur orthogonal avec la norme usuelle
Pour trouver l'expression du projecteur orthogonal pondéré $\prod$, considérons la situation dans laquelle on cherche à projeter notre vrai vecteur des fonctions, ${V_\pi }$, vers le sous-espace vectoriel des fonctions approximées $V$ et considérons que la norme utilisée est la norme euclidienne usuelle ${\left\| \cdot \right\|^2}$.
Le théorème de décomposition orthogonal nous permet d'écrire le vecteur $V_\pi$ sous la forme d'une somme de deux vecteurs appartenant chacun dans des sous-espace vectoriels orthogonaux (décomposition orthogonale de $V_\pi$ par rapport au sous-espace vectoriel V) :
avec ${V_\textbf{w}} \in V$ et $V_\textbf{w}^ \bot \in {V^ \bot }$. Le sous-espace vectoriel ${V^ \bot }$ est le complément orthogonal du sous-espace vectoriel V tel que :
Par exemple, dans l'exemple ci-dessous, le complément orthogonal de $V$ est une ligne perpendiculaire au plan $V$:

Par définition, on sait qu'il existe un vecteur $\textbf{w} \in \mathbb{R}{^2}$ tel que $X\textbf{w}=V_\textbf{w}$, donc on a la relation $(V_\pi-V_\textbf{w})=(V_\pi-X\textbf{w}) \in {V^ \bot }$.
On sait également que le vecteur des fonctions $V_\textbf{w}$ appartient au sous-espace vectoriel $V$, donc on peut écrire :
On peut donc écrire finalement notre vecteur $V_\textbf{w}$ de la mnanière suivante :
On en déduit donc l'expression du projecteur orthogonal avec la norme usuelle ${\left\| \cdot \right\|^2}$:
Expression du projecteur orthogonal pondéré
La norme utilisée pour mesurer les distances entre les vecteurs des fonctions des valeurs dans le sous-espace vectoriel $V$ est la suivante :
Si on définit la matrice des distributions des états par:
Alors on peut écrire la norme sous forme matricielle :
On peut donc maintenant écrire cette norme en fonction de la norme usuelle :
$\quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \: \: \: = D\left( {{V_\pi } - X\textbf{w}} \right)^T{\left( {{V_\pi } - X\textbf{w}} \right)}$
$\quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \quad \: \: \: = {\left\| {{D^{1/2}}\left( {{V_\pi } - X\textbf{w}} \right)} \right\|^2}$
En conséquence, pour trouver l'expression du projecteur orthogonal pondéré, il suffit d'utiliser la relation suivante :
On trouve donc: